Skip to content

Deine Datenspur ​

Du musst nichts Besonderes tun, um Daten zu produzieren. Es reicht, dass du aufstehst und dein Handy anschaust.

Für den Unterricht: Zu diesem Thema gibt es eine Diskussions-Präsentation mit Schätzfragen und Positionierungs-Übungen.

1. Ein ganz normaler Tag ​

Um 6:45 Uhr weckt dich dein Handy – dein Betriebssystem weiss also, wann du aufstehst. Auf dem Weg zur Schule wählt sich dein Gerät in Funkzellen und WLANs ein, die Wetter-App fragt deinen Standort ab, und die Musik-App merkt sich, was du hörst und wie lange. Beim Bäcker zahlst du mit Twint oder Karte, in der Migros hältst du die Cumulus-Karte hin. In der Pause suchst du nach einem Paar Schuhe, schaust drei TikToks zu Ende und scrollst über sieben weitere hinweg. Am Abend fragst du einen Chatbot, wie man eine Kurvendiskussion macht, und schläfst mit einer Serie im Hintergrund ein, die genau protokolliert, wo du aufgehört hast.

Kein einziger dieser Schritte fühlt sich nach «Daten abgeben» an. Trotzdem sind es leicht mehrere hundert Einträge in irgendwelchen Datenbanken – bevor du überhaupt etwas gepostet hast.

Kurze Übung im Plenum: Geht euren gestrigen Tag gemeinsam durch und sammelt an der Wandtafel jede Stelle, an der Daten entstanden sind. Erfahrungsgemäss kommt ihr in zehn Minuten auf über dreissig – und der Streit darüber, ob das Bezahlen im Laden dazugehört, ist der spannendste Teil.

2. Was «Big Data» eigentlich meint ​

Der Begriff beschreibt Datenmengen, die so gross und so schnelllebig sind, dass man sie mit den gewohnten Mitteln – Excel, ein einzelner Computer, ein Mensch, der hinschaut – nicht mehr auswerten kann. Klassischerweise nennt man drei Eigenschaften: die schiere Menge, die Geschwindigkeit, mit der ständig neue Daten dazukommen, und die Vielfalt der Formate, von Zahlen über Texte und Bilder bis zu Standortpunkten.

Manchmal kommen zwei weitere dazu: die Verlässlichkeit – Daten sind oft unvollständig, veraltet oder schlicht falsch – und der Wert, also die Frage, was sich am Ende überhaupt Nützliches daraus gewinnen lässt. Über diesen letzten Punkt entscheidet sich, ob jemand die Mühe auf sich nimmt; du triffst ihn im Kapitel Business of Data wieder.

Der eigentliche Punkt ist aber ein anderer, und der wird selten mitgenannt: die Verknüpfung. Deine Cumulus-Einkäufe für sich sind eine langweilige Liste. Kombiniert mit deiner Postleitzahl, deinem Alter, deinen Suchanfragen und der Uhrzeit deiner Einkäufe wird daraus eine Vorhersage – was du als Nächstes brauchst, wie viel du zahlen würdest, wie es dir gerade geht.

3. «Anonym» hält oft nicht, was es verspricht ​

Firmen beruhigen gern mit dem Satz, die Daten würden nur anonymisiert ausgewertet. Das klingt gut, ist aber schwieriger, als es tönt.

Die Informatikerin Latanya Sweeney zeigte in den 1990er-Jahren, dass sich ein grosser Teil der US-Bevölkerung allein durch die Kombination von Postleitzahl, Geburtsdatum und Geschlecht eindeutig identifizieren lässt – je nach Datengrundlage zwischen rund 60 und 87 Prozent. Drei harmlose Angaben, und schon ist niemand mehr anonym.

2008 nahmen zwei Forscher den öffentlich gemachten Datensatz des Netflix-Wettbewerbs, in dem Millionen von Filmbewertungen «anonymisiert» enthalten waren, und glichen ihn mit öffentlichen Kommentaren auf der Filmdatenbank IMDb ab. Wer dort ein paar Filme bewertet hatte, war im Netflix-Datensatz wiederzufinden – samt allen weiteren, deutlich privateren Sehgewohnheiten.

Und 2018 veröffentlichte die Fitness-App Strava eine weltweite Heatmap aller aufgezeichneten Laufstrecken. Alles aggregiert, alles ohne Namen. Trotzdem zeichneten sich in Afghanistan und im Nahen Osten geheime Militärbasen als leuchtende Joggingrunden ab, weil dort Soldaten ihre Runden drehten. Niemand hatte etwas Geheimes geteilt – das Muster allein genügte.

4. Die andere Seite: wenn grosse Datenmengen nützen ​

Es wäre unehrlich, nur die Schattenseite zu zeigen. Genau dieselbe Technik rettet Leben. In der Medizin erkennen Systeme auf Röntgen- und Netzhautbildern Auffälligkeiten, die Fachpersonen entgehen. Klimamodelle rechnen mit Milliarden von Messwerten und liefern die Grundlage für politische Entscheide. Verkehrsbetriebe planen Fahrpläne anhand echter Bewegungsdaten statt anhand von Schätzungen, und in Katastrophengebieten zeigen anonymisierte Mobilfunkdaten innert Stunden, wohin Menschen geflohen sind und wo Hilfe hin muss.

Grosse Datenmengen machen allerdings nicht automatisch klug. Das bekannteste Gegenbeispiel ist Google Flu Trends: Aus Suchanfragen nach Grippesymptomen sollte die Grippewelle vorhergesagt werden, und eine Zeit lang funktionierte das verblüffend gut. 2013 lag das System dann massiv daneben und überschätzte die Zahl der Fälle um mehr als das Doppelte – unter anderem, weil Medienberichte über die Grippe die Leute zum Suchen brachten, ohne dass sie krank waren. Die Maschine hatte ein Muster gelernt, aber keine Ursache verstanden.

5. Selbsttest ​

Big Data – verstanden?

Frage 1 von 6

Was macht Datensammlungen im Sinne von «Big Data» vor allem heikel?

6. Auftrag ​

Dein Datenspur-Protokoll ​

Wähle einen einzigen Tag – am besten einen ganz gewöhnlichen. Notiere darauf jede Situation, in der Daten über dich entstanden sind, mit Uhrzeit, Ort und dem, was vermutlich gespeichert wurde. Denk auch an das Unsichtbare: Funkzellen, WLAN-Verbindungen, Zahlungen, Kundenkarten, Kameras im öffentlichen Raum.

Markiere danach diejenigen Einträge, bei denen du dich bewusst entschieden hast, Daten herzugeben – und diejenigen, bei denen es einfach passiert ist. Halte zum Schluss in zwei bis drei Sätzen fest, welcher Eintrag dich am meisten überrascht hat.

Abgabe: eine Tabelle mit mindestens fünfzehn Einträgen plus deine kurze Schlussbemerkung.

Quellen ​

Zu den erwähnten Beispielen: L. Sweeney, Simple Demographics Often Identify People Uniquely (2000) sowie die spätere Überprüfung von P. Golle (2006); A. Narayanan und V. Shmatikov, Robust De-anonymization of Large Sparse Datasets (2008) zum Netflix-Datensatz; die Berichterstattung zur Strava-Heatmap vom Januar 2018; D. Lazer et al., The Parable of Google Flu (Science, 2014).

Informatik & ICT Unterricht Neufeld